即時快訊
圖/示意圖
科技生活

·a minute ago·責任編輯
#AI#大型語言模型#量化模型#程式開發#人工智慧
圖/示意圖
圖/示意圖
商傳媒|責任編輯/綜合外電報導
摘要

一款經 4 位元量化處理的 27B 參數大型語言模型 Qwen3.8-27B,在某項編碼基準測試任務中,展示了與頂尖雲端 AI 模型匹敵的卓越效能,證明透過量化技術能有效降低 AI 模型運行所需的硬體門檻,提升效率。

根據科技媒體《Wccftech》報導,一款經 4 位元(4-bit)量化處理的 270 億參數大型語言模型(LLM,一種基於巨量資料訓練的 AI 模型,能理解並生成人類語言),Qwen3.8-27B,在某項特定的編碼基準測試(coding benchmark,用於評估 AI 模型程式開發能力的標準化測驗)任務中,展現出足以媲美甚至超越頂尖雲端 AI 模型的優異表現。

這款相對較小型的模型,在 DeepSWE 編碼基準測試的一個單一任務中,通過了 98% 的測驗,更在程式碼審查任務中取得 12 分滿分。報導指出,即使是業界頂尖的雲端模型,在同樣的任務中平均通過率約為 96.6%,且僅約三分之二的機會能完美無瑕地完成。雖然在 DeepSWE 整個 113 個任務的基準測試中,頂尖雲端模型平均仍能獲得約 70% 至 74% 的分數,但 Qwen3.8-27B 在單一任務上的出色表現,凸顯了量化技術的潛力。

「量化模型」指的是透過降低模型權重數值精確度來縮減模型大小,進而降低硬體運行門檻的技術。Qwen3.8-27B 的 4 位元版本大小約在 13GB 到 18GB 之間,這意味著它可以在配備足夠 GPU 記憶體的現代電腦硬體上運行。舉例來說,在具備 24GB VRAM 的 NVIDIA RTX 4090 顯示卡上,Qwen3.8-27B 可以每秒處理 115 個 Token(用於表示文字或程式碼的最小單元),運作速度流暢且能充分利用顯示卡資源。

不過,一位進行這項測試的 Reddit 用戶強調,該結果僅來自單一任務,不代表 Qwen3.8-27B 在所有方面都全面超越頂尖模型。該用戶也澄清,儘管該模型通過了 43 個隱藏測試中的 40 個,但其提交結果並未完全解決該任務(二元結果為零),且 98% 的通過率可能受到其通過 109 個既有測試的影響。儘管如此,中型 LLM 在消費級硬體上處理實際程式開發任務時,已屢次證明其卓越性能。


在 Google 搜尋的熱門報導中優先看到商傳媒
加入為 Google 偏好來源